从ChatGPT到AI Agent,一文讲透 Agent 的底层逻辑
转载自微信公众号:言午 从ChatGPT到AI Agent,一文讲透 Agent 的底层逻辑
阅读指南
这篇文章,源于我一年半的AI开发实践,也源于我离职这近两个月里和许多团队密集交流后的一个强烈感受。我发现,在讨论Agent时,我们常常陷入两种误区:一些人将其神秘化,认为它无所不能;另一些人则将其过度简化,认为它“不过是把ChatGPT多调用几次”。
因为对 agentic 循环过程的体感缺少和原理的理解,形成认知的错位,最终导致我们的沟通成本很高。
因此,我写下这篇长文,希望能为我们这些从业者,建立一个关于Agent的体感和共识基础:AI Agent能力的质变,不仅在于底层大模型日益增长的智力,更关键的,在于我们围绕模型所设计的、那一套行之有效的“认知流程”。
本文近万字,就是体感的建立和对这套“流程”的完整拆解。你可以根据这份指南,快速找到自己感兴趣的部分:
- • 第一部分 (0x01 & 0x02):建立直观理解
- • 这里,我用了一个 “学霸的五个成长阶段” 的比喻,来描述Agent核心能力的演进过程。
- • 同时,我们会分析那个被行业广泛使用的“旅行规划”案例。它就像一道“标准考题”,在对比中,我们可以清晰地看到一个动态流程与一次性生成的本质区别。
- • 第二部分 (0x03 & 0x05):面向开发者的核心
- • 0x03 是本文的技术核心。它会详细拆解“流程”带来的三重价值:如何用“结构”为思考建立脚手架,如何用“迭代”为记忆打造压缩算法,以及如何用“交互”为模型连接现实世界。
- • 0x05 探讨了我们的角色转变——从“提示词工程师”到 “Agent 流程架构师” ,并讨论了Agent的性能工程与未来的架构演进方向。
- • 第三部分 (0x04):探寻理论根基
- • 最后,如果你好奇为什么这套
思考->行动->观察的流程从根本上就是有效的,0x04 会为你揭示其背后的科学基石,它与经典的控制论和信息论有着深刻的联系。
- • 最后,如果你好奇为什么这套
希望这篇文章,能为我们后续的交流与协作,提供一个更坚实的起点。
0x00 如果,高考可以再来一次
这几个月,我和非常多的开发者交流AI Agent。一个普遍的困惑是,很多人都知道Agent那个抽象的 思考 -> 行动 -> 观察 循环,但却无法真正“体感”到它的威力。他们会问:

“这不就是我和ChatGPT多聊几轮吗?凭什么自动化之后就能产生质变?”
为了回答这个问题,我们不妨先回到一个大家都经历的场景。
问一个可能有些“扎心”的问题:如果时间倒流,让你在高考结束的第二天,立刻重考一次,你的分数会更高吗?
相信,许多曾为高考结果扼腕叹息的同学会立刻站起来:
- • “我考完才猛然想起,那道复杂的解析几何题,如果换个思路用‘数形结合’的方法,本可以迎刃而解。”
- • “我因为太过紧张,有道选择题,脑子里想的是B,手上却涂成了C,交卷前也没检查出来。”
- • “我当时就是时间分配不合理,最后一道物理大题的完整思路明明都在草稿纸上,却没来得及誊上答卷!”
再来一次,就凭着这些细微末节的调整,提升几十分,并非不可能。
短短一天,你那经过十二年寒窗苦读才构建的知识储备,并没有发生任何质变。这就像今天的大语言模型(LLM),它的核心知识在训练完成的那一刻就被“冻结”了,形成了一个庞大但静态的知识库。
那么,分数提升的奥秘究竟在哪?
答案,正是我们理解AI Agent的核心所在:Agent的强大,并非源于模型智力的再次飞跃,而是源于我们为其赋予的“认知流程”的巨大提升。
这套“流程”,就如同你在考场上学会的“先易后难”的时间分配策略、交卷前雷打不动的“检查”习惯、以及解不出难题时果断“换个思路”的变通能力。
而要理解这套流程是如何在AI身上一步步建立起来的,我们不妨从学霸“小明”的成长史说起。
0x01 一个比喻讲清Agent核心:学霸的五个成长阶段
小明的成长,就是一部不断优化“解题流程”的进化史。
阶段一:原生天才
小明天赋异禀,脑子转得飞快。做数学题时,他极度自信,全程心算。考试时,他总是第一个把卷子“啪”地一声拍在讲台上,一脸轻松地走出教室。至于分数?别问,问就是“快不快吧!”。他确实把卷子做完了,但卷面之下,究竟有多少是因为跳步导致的计算失误,有多少是审题不清造成的方向性错误,他自己都不知道。
这完美对应了我们最开始使用大语言模型(LLM)的方式:基础API调用。我们把问题丢给它,它一次性地、黑盒般地生成一个答案。这个答案看起来很完整,甚至文采飞扬,但它究竟是如何得出的?其中有没有事实性错误?我们一无所知。这个阶段的AI,就像只追求速度的小明,交付了一个结果,却无法保证这个结果的可靠性。
阶段二:思考者
在几次因粗心丢分后,老师下达了硬性要求:所有题目,必须在草稿纸上写下详细的解题步骤。小明虽不情愿,但照做之后发现,正确率真的大幅提升了。把思考过程“外化”在纸上,让他能轻易发现逻辑链条中的微小瑕疵。
[核心概念:思维链 (Chain of Thought, CoT)]
CoT是第一个、也是最基础的结构化思考流程。它的核心作用在于,强制模型将一个复杂的、需要一步到位的“猜测式”任务,分解成了一系列简单的、线性的“推理式”子任务。它如同一个缰绳,拉住了试图“跳步”的思维野马,强迫它把注意力集中在当前这一步,利用上一步的结论,推导出下一步的结果,从而极大地降低了模型产生幻觉的概率。
Wei, J., Wang, X., Schuurmans, D., Bosma, M., Chi, E., Le, Q., & Zhou, D. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.